前一天我們談 Observability。 Observability 可以回答: Agent 做了什麼 呼叫哪些 Tool 哪裡失敗 花多少 Token 花...
前面 20 天,我們已經把一個 Agent 從最小 Loop 一路擴展到: Tool Runtime Permission / Approval / Sand...
很多團隊評估 Agent 的方法,其實還停留在評估 Chatbot。 準備一組問題、跑一次模型、比較輸出,再算出一個正確率。 但 Agent 處理的通常不是單...
TL;DR 最近在開發 AI Agent 處理美股財報時,我發現了一個嚴重陷阱:過度依賴 Vector Search (向量搜尋) 常會導致跨公司的「Entit...